메뉴

#스탠퍼드 대학교

HN
Hacker News • 29일 전
IMP 7

터미널벤치-사이언스: 과학 연구 워크플로에서 AI 에이전트 평가

스탠퍼드 대학 연구진이 주도하고 Terminal-Bench 팀이 개발한 'Terminal-Bench-Science'는 실제 과학자들의 연구 워크플로를 기반으로 AI 에이전트의 과학적 역량을 평가하는 벤치마크입니다. 첫 버전(0.1)은 생명·물리·지구·수학·공학 분야의 70개 과제를 포함하며, 가장 성능이 좋았던 Claude Opus 5의 해결률은 30%에 그쳤습니다. 이 벤치마크는 모델 개발사가 아닌 과학자들이 기준을 설정하고, 최신 AI 발전에 맞춰 지속적으로 진화하는 것이 특징입니다.

벤치마크 AI 에이전트 과학 연구
HN
Hacker News • 116일 전
IMP 7

스탠퍼드 CS336 강의 AI 코딩 어시스턴트 가이드라인

해커뉴스에 공개된 스탠퍼드 대학교의 딥러닝 강의(CS336)를 위한 AI 코딩 어시스턴트 가이드라인입니다. 이 가이드라인은 학생의 학습 경험을 보호하기 위해 AI가 정답 코드나 솔루션을 직접 제공하는 것을 엄격히 금지합니다. 대신 개념 설명, 디버깅 방향 제시, 코드 리뷰 등을 통해 조교(TA) 역할을 수행하며 학생이 스스로 문제를 해결하도록 유도해야 한다는 점에서 교육 현장의 AI 활용 표준을 제시합니다.

AI 에이전트 교육 가이드라인 스탠퍼드 대학교
HN
Hacker News • 116일 전
IMP 8

스탠퍼드 CS336: 밑바닥부터 시작하는 언어 모델링

스탠퍼드 대학교에서 2026년 봄 학기에 개설되는 'CS336: 밑바닥부터 시작하는 언어 모델링' 강의 소개글입니다. 이 수업은 기존의 뼈대 코드를 활용하는 것과 달리, 학생들이 직접 데이터 수집부터 Transformer 모델 구현, GPU 분산 학습 및 최적화까지 대규모 언어 모델(LLM) 전체를 구축하는 실무적인 과정을 강조합니다. AI 연구원 및 엔지니어에게 필수적인 심화 구현 능력과 시스템 최적화 기술을 배우는 데 매우 중요한 코스입니다.

스탠퍼드 대학교 대규모 언어 모델 트랜스포머 모델